Espace d'apprentissage | Interprefy

IA multilingue équitable : pourquoi le référentiel MMLU de l’UE est important pour la traduction automatique en direct par IA

Écrit par Dayana Abuin Rios | 30 juillet 2026

La plupart des discussions sur les performances linguistiques de l'IA se concentrent encore sur l'anglais. Un modèle obtient un bon score à un test de référence standard, est salué comme étant à la pointe de la technologie et déployé à l'échelle mondiale. Or, de plus en plus de données, notamment le nouveau jeu de données EU MMLU de la Commission européenne, montrent que d'excellentes performances en anglais ne préjugent en rien de la façon dont un modèle traite le français, le hongrois ou le maltais. Pour quiconque s'appuie sur la traduction automatique en direct lors d'événements internationaux, cet écart n'est pas une simple note de bas de page. Il fait toute la différence entre qu'un participant comprenne une conférence et qu'il la rate complètement. 

C’est important car les critères d’évaluation des grands modèles de langage (LLM) déterminent quels systèmes sont déployés et dignes de confiance. Si ces critères sont presque exclusivement conçus en anglais, ils ne peuvent pas nous renseigner sur les performances d’un modèle dans d’autres langues, notamment celles parlées par les publics cibles de la traduction automatique en temps réel. 

Qu’est-ce que le référentiel MMLU de l’UE ? 

EU MMLU est un nouvel ensemble de données de référence multilingues publié par la Direction générale de la traduction (DG Traduction) de la Commission européenne. Il s'appuie sur Massive Multitask Language Understanding (MMLU), l'un des cadres les plus utilisés pour l'évaluation des modèles de langage (LLM), qui teste ces modèles à travers des milliers de questions à choix multiples couvrant 57 disciplines, allant des sciences et du droit à l'éthique et aux affaires publiques.

Le projet EU MMLU adapte ce cadre spécifiquement au contexte de l'UE. Il se concentre sur sept domaines thématiques choisis pour leur pertinence pour les institutions européennes et couvre actuellement seize langues officielles de l'UE, dont le croate, le tchèque, le néerlandais, le français, l'allemand, le grec, le hongrois, l'irlandais, l'italien, le lituanien, le polonais, le portugais, le roumain, le slovaque et le slovène. D'autres langues sont prévues. Plutôt que de simplement traduire les questions anglaises existantes, le projet s'est attaché à préserver le même sens, le même niveau de difficulté et la même valeur diagnostique dans chaque version linguistique, de sorte qu'une note en polonais ait la même signification qu'une note en français.

Pourquoi un mannequin peut exceller en anglais et avoir des difficultés ailleurs 

La plupart des jeux de données d'évaluation de l'IA ont été créés en anglais et reflètent les contextes éducatifs, culturels et sociétaux anglophones. Un modèle entraîné et testé principalement sur des données en anglais peut paraître très performant, tandis que ses performances réelles dans d'autres langues restent largement méconnues.

C’est précisément cette lacune que la DG Traduction s’est efforcée de combler. Comme l’indique l’annonce du MMLU de l’UE, un modèle peut obtenir d’excellents résultats en anglais tout en étant nettement moins performant en français, en hongrois ou en maltais. Le problème sous-jacent n’est pas que les modèles soient incapables de traiter d’autres langues. Il réside plutôt dans le fait que les tests d’évaluation standard les évaluent rarement avec suffisamment de rigueur pour révéler leurs faiblesses. Ainsi, les lacunes en matière de grammaire, de nuances ou de terminologie spécifique à un sujet passent inaperçues jusqu’à ce qu’un public réel dépende du résultat.

Dans le cas de la traduction automatique en direct par IA, cette performance inégale a des conséquences directes. Un système peut parfaitement traiter un texte source en anglais simple, mais introduire des erreurs, des tournures de phrase maladroites ou des pertes de sens une fois ce même contenu traduit dans une langue cible moins éprouvée, précisément au moment où la précision est cruciale pour un auditeur suivant la traduction en temps réel.

 

Comment les biais linguistiques et culturels se manifestent dans la traduction en direct

Les écarts de performance linguistique ne représentent qu'une partie du problème. La DG Traduction a également publié des critères de qualité pour l'évaluation multilingue qui vont au-delà de la simple précision de la traduction afin de tester dans quelle mesure un modèle d'IA reflète les valeurs de l'UE et gère les spécificités culturelles, notamment les expressions idiomatiques, l'humour, les références, les formats de date et de nombre, ainsi que les différences de ton ou de politesse attendus.

Ce sont précisément ces éléments qui rendent la traduction simultanée particulièrement complexe. Un orateur qui utilise une expression régionale, une référence culturelle spécifique ou un niveau de formalité propre aux conventions locales s'appuie sur bien plus qu'une simple traduction littérale. Un système d'IA non familiarisé avec ce type de nuances linguistiques peut traduire les mots au pied de la lettre tout en perdant complètement le sens ou le ton voulu. Lors d'un événement multilingue, un tel décalage peut influencer la perception d'un message auprès d'une partie du public, même si personne ne remarque d'erreur technique.

Pourquoi les données multilingues validées par des humains restent importantes

L'un des aspects les plus remarquables de l'EU MMLU réside dans sa méthodologie. Contrairement à la plupart des évaluations multilingues, qui s'appuient principalement sur la traduction automatique pour générer des questions d'examen en langues étrangères, l'EU MMLU a adopté une approche centrée sur l'humain. La DG Traduction a collaboré avec près de 250 étudiants traducteurs et chefs de projet du réseau des Masters européens en traduction (EMT), issus de 21 universités européennes, afin de traduire et de réviser plus de 1 000 questions d'évaluation.

Cette distinction est plus importante qu'il n'y paraît. Un référentiel établi par traduction automatique risque d'hériter des mêmes faiblesses qu'il est censé révéler, en comparant la production d'un modèle à celle d'un autre plutôt qu'à une véritable norme humaine. La relecture humaine ancre l'évaluation dans l'usage réel de la langue, norme qui importe également pour la traduction en direct lors d'événements réels, où le public est humain et la tolérance aux erreurs de traduction, même subtiles, est faible.

Quelles conséquences une évaluation plus équitable de l'IA pourrait avoir sur les événements multilingues ?  

La DG Traduction définit clairement son ambition à long terme : établir une nouvelle norme d’évaluation de l’IA multilingue en Europe, afin que les systèmes d’IA fonctionnent de manière cohérente quelles que soient les langues et les cultures, et non plus uniquement dans des environnements anglophones. Si cette ambition se concrétise, les retombées pratiques s’étendront bien au-delà des laboratoires de recherche.

Pour les organisations qui organisent des conférences internationales, des réunions institutionnelles ou des événements d'entreprise mondiaux, une meilleure évaluation multilingue permet de mieux identifier les systèmes d'IA fiables pour chaque langue, évitant ainsi de découvrir en cours d'événement qu'un outil particulier est moins performant hors de l'anglais. Elle facilite des décisions plus éclairées quant à la fiabilité de la traduction simultanée par IA seule et aux domaines où une approche hybride, combinant IA et interprétation humaine, préserve mieux le sens et les nuances pour une langue ou un public spécifique.

Des référentiels comme l'EU MMLU ne résoudront pas du jour au lendemain toutes les lacunes de l'IA multilingue, mais ils marquent un tournant significatif dans la manière dont les performances sont mesurées et communiquées. À mesure que ces normes d'évaluation se précisent, elles offrent aux organisateurs d'événements, aux institutions et aux équipes de communication une base plus claire pour choisir des solutions de traduction automatique en direct adaptées à des publics véritablement multilingues. Pour découvrir l'approche d'Interprefy en matière de traduction automatique en direct multilingue, explorez notre plateforme de traduction vocale par IA.